Appearance
Validating the applicability of bayesian inference with surname and geocoding to congressional redistricting
Summary
Problem: 在选区划分中,确保少数族裔的描述性代表而不将其过度集中(packing)是一个长期难题,尤其是在缺乏选民档案种族数据的州。传统的生态推断(EI)方法存在局限,而BISG作为一种新兴方法虽已被证明优于EI,但尚未有研究验证其在选区划分中的适用性和准确性。具体而言,从BISG后验概率估计中分配种族类别的方式(概率求和法PSM vs. 多数分配法PM)会如何影响选区层面种族构成估计的准确性,这一问题尚不清楚。
Approach: 作者利用北卡罗来纳州和佐治亚州两个拥有选民档案种族数据的州,对BISG方法进行验证。他们使用R包zipWRUext,基于姓氏和邮政编码人口统计数据计算每位选民的种族联合概率。随后,分别采用PSM(将个体属于某一种族的概率加总到地理单元)和PM(将个体分配到概率最高的种族类别)两种方法估计每个选区和每个国会选区的种族构成,并以选民档案中的实际自报种族数据为基准进行比较。此外,作者使用Redist包对每个州进行了10,000次国会选区划分模拟,以评估选区层面的误差分布。
Finding: 研究发现,在选区和国会选区两个层面,PSM方法均显著优于PM方法,误差率更低。具体而言,PSM方法在选区层面的误差率大幅降低,尤其在估计黑人选民比例时优势明显。在选区层面,PSM估计的少数族裔选民比例通常落在实际选民档案数据的五个百分点以内,但误差幅度因州和种族群体而异。北卡罗来纳州的误差低于佐治亚州,白人选民比例的误差低于黑人选民比例。
Significance: 该研究为BISG在选区划分中的实际应用提供了首个实证验证和明确的操作指南。研究结果表明,BISG可以帮助构建多数-少数族裔选区,特别是在缺乏选民种族数据的州。这一发现对2020年选区划分周期具有重要的实践意义,为立法者、研究者和公民提供了减少种族和党派偏见的量化工具。
Theoretical Framework
- Theoretical tradition: 该论文属于政治学中的代表性研究传统,具体涉及描述性代表理论、选区划分中的种族公平问题,以及方法论上的生态推断与贝叶斯推断传统。
- Prior theories built upon: 论文建立在以下理论和模型之上:(1) Goodman (1953) 和 King (1997) 的生态推断(EI)方法论;(2) Elliott et al. (2008) 提出的贝叶斯改进姓氏地理编码(BISG)方法;(3) Imai and Khanna (2016) 对BISG相对于EI方法的改进验证;(4) 选区划分中关于"packing"和"cracking"的规范性理论关切。
- Causal mechanism: 核心机制是:BISG通过贝叶斯规则结合个体的姓氏(先验)和居住地地理人口统计(条件概率)来估计种族归属。PSM方法通过加总概率保留了估计的不确定性信息,而PM方法通过强制分配单一类别丢弃了这种不确定性,导致系统性误差的累积。因此,PSM在聚合层面(选区、选区)产生更准确的种族构成估计。
- Key assumptions: 论文隐含的假设包括:(1) 姓氏和地理信息能够提供足够的种族预测信息;(2) 邮政编码作为地理单元足以产生准确的估计(虽然不如街区数据精确);(3) 选民档案中的自报种族数据是准确的基准;(4) 北卡罗来纳州和佐治亚州的发现可以推广到其他州。
- Theoretical move: 该论文应用了已有的BISG理论和方法,将其从公共健康和一般政治学应用场景扩展到选区划分这一特定政策场景,并验证了不同后验分配方法在该场景下的适用性。论文没有挑战BISG本身的理论基础,而是对其操作化方式进行了比较和优化。
- Scope conditions: 论文的结论主要适用于以黑人和白人为主、种族隔离程度较高的州(如北卡罗来纳和佐治亚)。在种族构成更加多元、非黑人少数族裔和西班牙裔选民比例更高的州,BISG的误差可能更大。此外,当需要估计特定少数族裔群体(而非简单的白人与非白人二分)时,误差也需谨慎考虑。
Research Design
本研究采用模拟研究(simulation study)设计,结合了实证验证和计算模拟。具体而言:
- 研究类型:基于真实选民档案数据的计算模拟研究。
- 分析单元:选区和国会选区两个层面。
- 自变量:BISG种族估计的后验分配方法,分为两种:(1) 概率求和法(PSM)——将个体属于某一种族的后验概率加总到地理单元;(2) 多数分配法(PM)——将每个个体分配到后验概率最高的种族类别。
- 因变量:BISG估计的种族构成与实际选民档案种族构成之间的绝对百分比误差。
- 操作化:使用R包zipWRUext基于姓氏和邮政编码人口统计计算BISG后验概率;使用Redist包进行选区划分模拟;误差计算为BISG估计比例与实际选民档案比例之间的绝对百分比差异。
Data & Sample
- 样本量:北卡罗来纳州和佐治亚州的全部登记选民。佐治亚州选民档案约700万选民。
- 国家/地区:美国,具体为北卡罗来纳州和佐治亚州。
- 数据来源:两州的选民登记档案(包含自报种族数据),以及用于BISG的姓氏词典和人口普查邮政编码人口统计数据。
- 数据收集方法:使用现成的选民档案数据,通过R包zipWRUext进行BISG估计。
- 时间周期:论文未明确说明选民档案的具体年份,但研究背景为2010年选区划分周期后的数据,服务于2020年选区划分周期。
- 选区划分模拟:基于Curiel和Steelman (2018)的北卡罗来纳州选区简化地图和佐治亚州2010年国会选区的选区形状文件,使用Redist包进行10,000次模拟。
Analytical Strategy
- 主要分析模型:BISG贝叶斯推断模型,具体使用R包zipWRUext实现,基于姓氏和邮政编码人口统计计算种族后验概率。
- 误差评估:计算BISG估计与实际选民档案数据之间的绝对百分比差异,在选区层面绘制误差密度图,在选区层面通过10,000次模拟构建误差分布和95%置信区间。
- 比较方法:系统比较PSM和PM两种后验分配方法在选区和选区层面的误差表现。
- 控制变量:论文未明确提及传统意义上的控制变量,但通过分别分析白人和黑人选民比例、分别分析两个州来考察误差的异质性。
- 稳健性检验:论文通过10,000次模拟构建误差分布,本质上提供了对估计不确定性的全面评估。此外,论文在补充材料中进行了个体层面BISG预测的诊断检验(Section C)。
Results & Findings
发现一:PSM在选区层面显著优于PM 在选区层面,对于白人选民比例,两种方法的模态误差都接近零,但PM方法具有更长的右尾,表明其表现更差。对于黑人选民比例,PSM方法大幅优于PM方法,误差率显著降低。这一发现在北卡罗来纳州和佐治亚州均成立。这一结果与理论预期一致:PM方法通过强制分配单一种族类别丢弃了概率信息,导致误差累积。
发现二:PSM在选区层面同样优于PM 在10,000次选区划分模拟中,几乎所有选区层面的估计中,PSM的绝对误差率都显著低于PM,与选区层面的诊断结果一致。这表明PSM的优势在聚合到更高地理层级时依然保持。
发现三:误差幅度因州和种族群体而异
- 在北卡罗来纳州,PSM对白人选民比例的误差接近零,对黑人选民比例的误差从未超过5个百分点。
- 在佐治亚州,PSM的误差略高——白人选民比例的误差最高约10个百分点,但黑人选民比例的误差较低,与北卡罗来纳州类似,峰值约5个百分点。
- 这一异质性可能与两州的人口结构和种族隔离程度有关。
发现四:BISG估计的实用性 使用PSM方法,BISG对选区少数族裔选民比例的估计通常落在实际数据的5个百分点以内,表明BISG可以有效地辅助构建多数-少数族裔选区。
零结果与意外发现:论文未报告显著的零结果。一个值得注意的发现是,佐治亚州白人选民比例的误差(最高约10个百分点)高于预期,提示在应用BISG时需要考虑州际差异。
Limitations
作者承认的局限性包括:
- 地理单元精度:使用邮政编码而非地址匹配的人口普查街区数据,对非黑人少数族裔估计的准确性较低。
- 州际推广性:北卡罗来纳州和佐治亚州以黑人和白人为主,且种族隔离程度较高,BISG在这些州的准确性可能高于种族构成更加多元的州。
- 种族类别限制:分析主要聚焦于黑人和白人两类,将西班牙裔视为与种族互斥的类别,在需要估计西班牙裔多数选区时可能需要不同的处理方法。
- 未来研究方向:需要研究非黑人少数族裔和西班牙裔选民占更大比例的州的BISG准确性;可以将BISG估计与选民历史中的差异化投票率结合,以更好地构建多数-少数族裔选区。
Key Contributions
- 首次对BISG在选区划分中的应用进行了实证验证,填补了该领域的空白。
- 系统比较了PSM和PM两种后验分配方法,明确推荐PSM作为选区划分中的首选方法。
- 通过10,000次模拟提供了选区层面BISG估计误差的分布和95%置信区间,为研究者提供了基线不确定性参考。
- 证明了使用邮政编码而非地理编码即可快速(约10分钟处理700万选民)且较准确地估计种族构成,降低了BISG的应用门槛。
- 为2020年选区划分周期提供了实用的方法指南,特别是在VRA预先批准保护缺失的背景下,有助于构建高效的多数-少数族裔选区。
Key Claims
"We find that probabilistic summing of the BISG posteriors significantly reduces error rates at the precinct and district level relative to plurality racial assignment, and therefore should be the preferred method when using BISG for redistricting." (Abstract)
"Using PSM, BISG district-level estimates of the share of minority voters in districts typically fall within five percentage points of self-reported voter file racial data, although the magnitude of the errors vary across states and racial groups." (Abstract)
"A recommendation we make confidently from just these precinct-level results is that PSM should be the preferred method when estimating the racial composition of precincts by using BISG on voter files." (Section 3)
"First, researchers using BISG should aggregate up to some polygonal unit of interest by summing the estimated probabilities of racial membership. Although it might be tempting to assign race to single voters in order to aid in point-based redistricting attempts, the errors will be drastically higher." (Section 4)
"Second, researchers should be prepared to deal with around a 5–10 percentage point error rate in estimating race at the district level." (Section 4)